AI Infra 专栏导览
标签
AI/infra
字数
797 字
阅读时间
4 分钟
本目录收模型跑在真实硬件上的那一层。它是 AI/ 下的一棵子树,按「一条链 + 一篇横切」组织:
| 位置 | 收什么 |
|---|---|
gpu/ | 硬件本身 —— 架构、存储层次、算力与带宽、多卡互联拓扑 |
cuda/ | 在硬件上写 kernel —— 编程模型、访存优化、经典算子 |
train/ | 用多块硬件训练 —— 框架、切分策略、通信、显存账本 |
infer/ | 把模型服务出去 —— 调度、显存管理、推理引擎、端侧 |
| 01-数值计算与精度 | 横切篇 —— 浮点格式、舍入、溢出下溢、混合精度与 Loss Scaling |
前四块是一条链:硬件 → 在硬件上写算子 → 训练 → 服务。 第五块不在链上 —— 它讲的是「前面所有公式在有限精度下会怎么失真」,被四块同时引用,所以放在这一层而不是任一子目录里。
它与相邻专栏的边界是关注点而不是技术栈:
| 不收 | 去哪看 | 本专栏只关心 |
|---|---|---|
| 机器学习算法与数学基础 | AI/ml/ | 这些算法跑在真实硬件上要付什么代价 |
| 模型本身 —— 架构、分词、位置编码、采样、缩放法则、幻觉 | AI/llm/ | 模型怎么跑起来 —— 显存、调度、算子、训练、部署 |
| 模型怎么被组织成应用 —— 循环、工具、协议、上下文、评测 | AI/agent/ | 模型运行的物理层 |
边界不是绝对的,同一对象常在两个层次各有一篇。10-KV Cache 与推理优化 算的是 KV Cache 的显存账本和注意力布局(模型侧:为什么它这么大、怎么让它变小);infer/ 里的 02-PagedAttention:KV Cache 的分页管理 讲的是引擎怎么把这块显存管起来(infra 侧:块表、引用计数、抢占)。
相关
- 01-推理性能指标与瓶颈定位 —— 进推理侧的入口
- 02-分布式训练总论与显存账本 —— 进训练侧的入口
- 01-GPU 硬件架构与存储层次 —— 进硬件侧的入口
- 10-KV Cache 与推理优化 —— 模型侧对同一批对象的另一种切法
参考
本专栏的推理优化与分布式训练部分整理自 AIInfraGuide,按概念颗粒度重新组织;承重的量化断言逐条核对到一手来源,核对结果与出处写在各篇的 ## 参考。
- AIInfraGuide 全站:https://caomaolufei.github.io/AIInfraGuide/
- vLLM 官方文档:https://docs.vllm.ai/en/latest/
- NVIDIA CUDA C++ Programming Guide:https://docs.nvidia.com/cuda/cuda-c-programming-guide/
- PyTorch Distributed Overview:https://pytorch.org/docs/stable/distributed.html
YJ